"我们智能体上线了!"——然后一周后用户投诉潮来了:答错的、转不出去的、越改越差的,全靠客诉才发现。没评测、没监控的智能体,等于闭眼开车。模型一升级、提示词一改,表现可能悄悄退化,你却毫无察觉。
把智能体当线上服务对待:发布前过四道关,发布后盯实时指标。两件套齐了,才敢真放手。
1. 任务成功率。挑 20~50 个核心场景,看它能不能跑通到终点。这是硬指标,不过就别上。
2. 答案准确率。用"金标准"答案集对比,或人工抽检。别只看通顺,要看对不对。
评估集样例:
输入:"帮我取消订单 NO20260701"
期望:调用 cancel_order 且返回成功,不擅自改其他单
判分:成功=1,调错工具/改错单=0
3. 兜底率。专门测"该转人工"的场景(如用户情绪激动、涉钱涉法),看它是不是真转了,而不是硬撑。
4. 回归测试。每次改提示词/换模型,重跑旧评估集,确保老场景不退步。用脚本固化,别靠肉眼。
某金融客服上线"评测+监控"后,把发布前的坏版本挡在门外 3 次(都是模型升级后准确率掉 15 个点);线上监控在大面积错误发生的 10 分钟内就拉了告警,避免了一次客诉发酵。
① 评估集会过期:业务变了要补样例,别用半年前的老题。② 别只看平均分:一个致命错能毁掉 99 个对,要盯最坏情况。③ 监控要可定位:只报"成功率下降"不够,要能下钻到"卡在工具调用环节"。
设计智能体时同步攒一份评估集,别等上线再补。评估集越贴近真实业务,你心里越有底。没测就上,等于裸奔;测了再上,才睡得着。